Dalam ranah Kecerdasan Buatan, pemodelan urutan mengalihkan fokus dari cuplikan statis menuju aliran temporal. Tugas pembelajaran mesin standar sering kali mengasumsikan bahwa titik data bersifat Independen dan Terdistribusi Identik (IID), yang berarti urutan sampel tidak mempengaruhi hasilnya.
Pemodelan urutan secara eksplisit menolak hal ini, dengan berfokus pada tiga pilar inti:
- Pelanggaran Invarian Permutasi: Dalam data tabular, urutan kolom bersifat arbitrer. Dalam urutan, urutan adalah fitur utama. Menukar "Kucing memakan tikus" menjadi "Tikus memakan kucing" secara fundamental mengubah kebenaran dasar semantik meskipun token-tokennya identik.
- Autoregresif Sifat-Sifat: Kami mengasumsikan bahwa sebuah observasi pada waktu $t$ secara matematis dikondisikan pada riwayatnya ($t-1, t-2, \dots, 1$). Hal ini memerlukan probabilitas transisi untuk menangkap bagaimana informasi berkembang.
- Pemetaan Panjang Variabel: Tidak seperti kisi piksel tetap 28x28, urutan seperti kalimat atau gelombang seismik bersifat elastis. Model harus memproses masukan dengan panjang $N$ dan menghasilkan keluaran dengan panjang $M$ menggunakan parameter yang konsisten.